分布式假说(Distributional Hypothesis)
概述
语言学基本假说:语义相似的词倾向于出现在相似的上下文中,即"一个词由其邻居定义"。
关键内容
- 核心思想:Firth(1957)提出"You shall know a word by the company it keeps"。该假说认为词的语义可以通过其在语料中的上下文分布来推断,上下文相似的词具有相似的语义。
- 数学形式化:Word2Vec 等词向量模型将分布式假说转化为优化问题——学习稠密向量表示,使得上下文相似的词在向量空间中距离更近。
- 对 NLP 的影响:分布式假说是从 one-hot 编码走向分布式表示的理论基础。它支撑了 Word2Vec、GloVe、FastText 等词向量方法,以及后续 BERT 等上下文感知表示学习。
分布式假说是现代自然语言处理的理论基石之一,为词的分布式表示提供了语言学依据。
来源
相关
- Word2Vec — implements
- 词向量(Word Embedding) — enables
- CBOW(连续词袋模型) — based_on
- Skip-gram — based_on
- Tomas Mikolov — relates_to